Type: concept
Confidence: 0.85
Created: 2026-04-25
Updated: 2026-04-25
Tags: transformerattention-mechanismllm-limitationscontext-engineeringAI工程

Attention Dilution

概述

Attention Dilution(注意力稀释)是指随着 Transformer 模型上下文窗口长度增加,每个 token 的平均注意力权重下降的现象。这是 LLM 上下文管理的核心限制之一,也是 Context Engineering 存在的重要动机。

关键内容

  1. 技术机理
  2. TransformerSoftmax Attention 机制:attention(Q,K,V) = softmax(QK^T / √d) · V
  3. 当上下文长度 N 增大时,Softmax 分母增大 → 每个 token 平均注意力权重下降
  4. 关键信息被"稀释"在大量噪声中
  5. 模型有效"关注"范围存在软上限

  6. 对模型性能的影响

  7. 信息冗余 → 注意力稀释(Lost in the Middle 问题)
  8. 模型可能忽略重要的上下文信息
  9. 随着上下文增长,召回准确信息的能力下降

  10. 工程对策

  11. 最大化信噪比Signal-to-Noise Ratio
  12. 使用位置效应策略:关键信息放在头部或尾部
  13. 上下文压缩与选择性保留
  14. 滑动窗口和分层记忆架构

  15. Context Engineering 的关系

  16. Attention Dilution 是 Context Engineering 存在的根本原因之一
  17. Context Engineering 的核心任务之一就是对抗注意力稀释的影响
  18. 通过信息架构设计最大化有效注意力利用率

来源

相关